Appearance
Hierarchically regularized entropy balancing
Summary
Problem: 熵平衡(ebal)是观测研究中常用的重加权方法,通过调整对照组权重实现协变量精确平衡。但ebal存在两个主要缺陷:一是研究者需自行指定要平衡的协变量矩(如线性项、平方项、交互项),这为规格搜索和选择性报告留下空间;二是当控制组单位数相对于可用协变量数较少时,算法可能不收敛或产生高度集中的权重,导致估计方差过大。因此,研究者面临两难:平衡项过少导致偏差,平衡项过多则可能不可行或方差过高。
Approach: 本文提出分层正则化熵平衡(hierarchically regularized entropy balancing, hbal),作为ebal的扩展。hbal通过将协变量进行级数展开(包括平方项、立方项和交互项),在扩展后的特征空间上使用带分层结构的岭惩罚(ridge penalty)实现近似平衡。具体而言,hbal对拉格朗日乘子施加分组的分层ℓ2惩罚,默认对水平项(level terms)实现精确平衡(α1=0),仅对高阶矩约束进行正则化。通过V折交叉验证选择调参参数,最小化扩展协变量平衡的均绝对误差。
Finding: 通过蒙特卡洛模拟和实证案例,hbal和hbal+(结合结果模型的版本)在偏差和方差方面均优于ebal、ebal*、kbal等常用方法。当数据生成过程具有非线性特征时,hbal的优势尤为明显。此外,hbal在计算效率上远高于核平衡(kbal),且随着样本量增大优势更加显著。在实证案例(巡回法院法官行为研究)中,hbal+的结果与原始研究(Black and Owens 2016)基本一致,而ebal+的估计对规格选择极为敏感。
Significance: 该研究为观测研究中的协变量平衡提供了一种更稳健、更少依赖研究者主观选择的预处理方法。hbal通过自动化的分层正则化机制,减少了规格搜索的空间,同时避免了高维平衡带来的计算失败和权重集中问题,为因果推断领域提供了一种可扩展、计算高效的平衡工具。
Theoretical Framework
- Theoretical tradition: 潜在结果框架(potential outcomes framework)下的因果推断,具体属于协变量平衡预处理方法(covariate balancing preprocessing methods)这一研究传统。
- Prior theories built upon: 熵平衡(Hainmueller 2012);Zhao and Percival (2017) 证明熵平衡是双重稳健估计量;协变量平衡倾向得分(CBPS, Imai and Ratkovic 2014);核平衡(kbal, Hazlett 2020);近似残差平衡(Athey, Imbens, and Wager 2018);最小离散近似平衡权重(Wang and Zubizarreta 2019);调查加权中的校准加权/分层抽样(raking, Deming and Stephan 1940)。
- Causal mechanism: hbal通过调整控制组权重,使加权后的控制组在扩展协变量空间上近似匹配处理组的协变量分布,从而消除可观测混杂因素造成的偏差。其权重可解释为带特殊损失函数的惩罚倾向得分(penalized propensity scores),通过优先平衡对倾向得分预测力更强的特征组,实现偏差与方差的权衡。
- Key assumptions: 强可忽略性(strong ignorability)和积极性(positivity)假设;潜在结果与协变量之间的关系可以通过协变量的多项式展开(三阶以内)近似;当结合结果模型时(hbal+),要求结果模型正确设定或权重收敛于真实倾向得分的logit函数。
- Theoretical move: 本文扩展了熵平衡方法,将精确平衡推广为带分层正则化的近似平衡,并应用了岭惩罚和交叉验证等统计学习技术到协变量平衡问题中。它同时综合了熵平衡、倾向得分加权和校准加权三条研究线索。
- Scope conditions: 适用于二元处理变量的观测研究;当数据生成过程接近协变量的多项式展开时效果最佳;当控制组样本量相对较小时,hbal仍能工作但只能实现近似平衡,此时建议结合结果模型(hbal+)以消除残余不平衡造成的偏差。
Research Design
本文采用模拟研究(Monte Carlo simulation)和实证案例复制两种研究设计。模拟研究中,单元分析层次为个体观测单位。关键自变量为处理方法(hbal、hbal+、ebal、ebal*、kbal、CBPS、CEM、PSW、Raw),因变量为ATT估计的偏差和方差。协变量包括6个(G1-G6),其中G1-G4服从多元正态分布,G5-G6服从伯努利分布。处理分配机制为D = 1{f(G) − 2 + ε > 0},其中f(G)是协变量级数展开中随机子集的线性组合。结果变量设计三种方案:线性、非线性和三角函数形式,真实处理效应固定为0。实证案例中,复制Black and Owens (2016)关于晋升前景对巡回法院法官行为影响的研究,处理变量为最高法院空缺期(vs. 非空缺期),结果变量为法官是否按总统立场投票。
Data & Sample
模拟研究:样本量N = 900,控制组与处理组比例为5:1。协变量G1-G4独立抽样自均值为0、方差为1、协方差为0.2的多元正态分布;G5和G6分别从成功概率为0.3和0.2的伯努利分布中独立抽取。结果变量中误差项u服从标准正态分布。补充材料中报告了不同样本量和控制组比例的额外结果。实证案例:使用Black and Owens (2016)的数据,涉及巡回法院法官在最高法院空缺期和非空缺期的投票行为,匹配变量包括法官的司法共同空间得分(Judicial Common Space score)、法官与总统的意识形态一致性、案件是否被巡回法院推翻等七个协变量。
Analytical Strategy
模拟研究中,比较hbal和hbal+与五种常用匹配和加权方法(PSW、CBPS、CEM、ebal、kbal)以及ebal*(对级数展开协变量集使用ebal)和Raw(朴素DIM)的表现。hbal和hbal+使用三阶级数展开的全部69个协变量;其他方法仅使用原始变量G。评估指标为ATT估计的偏差和方差。hbal的调参参数通过V折交叉验证选择,最小化扩展协变量平衡的均绝对误差。优化方法采用trust-region优化(Powell 1994)。实证案例中,使用解权重进行加权线性回归,标准误按法官个体聚类。为评估ebal+对规格的敏感性,额外运行500个包含随机高阶矩的模型。补充材料中报告了不同结果设计、样本量和控制组比例的额外结果,以及hbal在Lalonde数据上的应用。
Results & Findings
- 线性结果设计(设计1):大多数方法相比朴素DIM显著降低偏差。ebal*表现不佳,原因是ebal算法在大量矩约束下不收敛。hbal在偏差和方差降低方面均优于其他方法,这得益于其区分不同协变量矩重要性的能力。
- 非线性结果设计(设计2和3):仅依赖原始变量G估计倾向得分或权重的方法(PSW、CBPS、CEM、ebal、kbal)表现不佳。hbal和hbal+的估计偏差和方差均显著更小。这表明当数据生成过程接近协变量的多项式展开时,hbal的分层结构能够根据平衡约束的重要性调整正则化强度,在降低偏差的同时保持较小的方差。
- 计算效率:hbal找到解权重所需时间仅为kbal的一小部分,且随着样本量增大,hbal的可扩展性优势更加明显。
- 实证案例:对于竞争法官(contending judges),hbal+和ebal+均表明空缺期法官更可能按总统立场投票,但ebal+的估计在5%水平上不显著,hbal+的估计更精确。对于非竞争法官,ebal+估计显示空缺期更可能按总统立场投票,而hbal+显示无显著差异。hbal+的结果与Black and Owens (2016)原始发现基本一致,而ebal+的估计在500个随机规格中变化很大,从负效应到正效应不等。
- 补充证据:分层正则化使解权重与真实倾向得分之间的相关性更高。
Limitations
作者在文中未明确列出局限性,但可从文中推断:hbal的有效性依赖于数据生成过程接近协变量的多项式展开这一假设;当控制组样本量相对较小时,hbal只能实现近似平衡,需要结合结果模型(hbal+)来消除残余偏差;调参参数的选择虽然采用数据驱动方法,但仍需研究者指定参数空间和协变量分组方式;实证案例中hbal+的置信区间基于聚类标准误,但未报告其他推断方法的稳健性检验。
Key Contributions
- 提出hbal方法,将熵平衡扩展为带分层正则化的近似平衡,解决了ebal在高维协变量空间中的优化失败和权重集中问题。
- 通过分层结构(对水平项精确平衡、对高阶项正则化)减少了研究者对平衡特征选择的自由裁量,降低了规格搜索和选择性报告的风险。
- 通过蒙特卡洛模拟证明hbal在偏差和方差方面优于ebal、ebal*、kbal、CBPS、CEM、PSW等常用方法,尤其在非线性数据生成过程中优势明显。
- 证明hbal在计算效率上远高于kbal,具有更好的可扩展性。
- 开发了开源R包hbal,便于研究者使用。
- 通过实证案例(巡回法院法官行为)展示了hbal在实际研究中的应用价值,表明其估计比ebal+更稳健、更可靠。
Key Claims
"Despite its appealing properties, such as exact balance, computational efficiency, and double robustness, ebal has two main drawbacks. First, it requires researchers to specify the moments of the covariates to be balanced on, which leaves room for specification searching and selective reporting. Second, when the number of control units is small relative to the number of available covariates, the algorithm either does not converge or generates highly concentrated weights." (Section 1, Introduction)
"hbal addresses this problem by modifying the objective function in (1), that is, adding an ℓ2 penalty with a hierarchical structure to the Lagrangian multipliers Z." (Section 2, Approximate Balancing with Hierarchical Regularization)
"This grouped structure allows differential strengths of regularization to be applied to different groups of balance constraints and prioritizes feature groups that have heavy influence on the overall covariate balance between the treatment and control groups." (Section 2, Approximate Balancing with Hierarchical Regularization)
"Compared with entropy balancing, this extension relaxes model dependency and improves the robustness of causal estimates while avoiding optimization failure or highly concentrated weights." (Abstract)
"hbal thus can serve as a building block for methods that seek approximate covariate balance." (Section 5, Conclusion)